突发,OpenAI GPT-6跑分作弊被抓包了!
突发,OpenAI GPT-6跑分作弊被抓包了!媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
搜索
媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
前OpenAI首席技术官Mira Murati领导的Thinking Machines Lab正洽谈以至少400亿美元投前估值筹集至少10亿美元,现有投资者Accel拟领投,Nvidia洽谈参投。
OpenAI 的 GPT-6 Astra 在有界素数间隔问题上将上界从 246 推进至 186,并完成 Lean 形式化验证,显示 AI 正从数学解题工具走向研究伙伴。
据《The Information》报道,OpenAI 最强新模型 Astra 被曝采用「循环深度」(recurrent depth)技术,使模型在输出 Token 前完成多轮潜在空间计算并显著提升网络安全能力,但这一「少说多想」的推理方式因思维链可能被压缩到难以读取的内部状态而引发 AI 安全专家对监管失效的担忧。
Astra还没发,外媒把OpenAI的王牌技术曝光了。
OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。
刚刚,OpenAI 宣布,ChatGPT 的广告的年化收入运行率(run rate)突破 10 亿美元。
吓哭了。 在这三个月里,OpenAI 的模型诞生了三个秘密人工智能文明。
867 亿元,Hugging Face 被英伟达纳入麾下,就在这桩巨额收购的前一晚,OpenAI 发布超长安全调查报告里,Hugging Face 还是一个巨大的「事故现场」——看来并没有影响它的价值。
OpenAI 刚刚发布的官方博客和数十页技术报告中将其定性为一声「警钟」(warning shot)。同时,第三方机构 METR 和 Redwood Research 发布了独立调查报告。OpenAI 的 Noam Brown 提醒,驱动这次事件的模型与 GPT-5.6 Sol 同等规模,下一代模型能力会更强。